1 Contenido de la clase
Modelo de cámara y proporcionalidad [00:00-01:23]
La clase arranca con el modelo de cámara más sencillo: la relación entre la distancia de la cámara al objeto y la distancia focal se explica con proporcionalidad (triángulos semejantes) [00:00-00:22]. Todo es proporcional: comparando la distancia al objeto con la distancia al foco se obtiene un factor de escala [00:53-00:59]. El profesor da un ejemplo numérico de proporción (p. ej. 5:2) entre las distancias [01:03-01:19]. [parte no entendida — el detalle del ejemplo con las cifras exactas no se distingue en la grabación].
Aplicación: reconstruir una escena desde muchas fotos [01:23-02:13]
Como motivación se plantea el problema de relacionar vistas de un mismo objeto: personas tomando muchas fotos del Coliseo romano desde puntos distintos; entre todas las tomas siempre hay una relación geométrica entre lo capturado desde cada posición [01:53-02:13].
Coordenadas homogéneas [02:22-04:16]
Para trabajar el modelo de cámara se pasan las coordenadas reales (cartesianas) a coordenadas homogéneas: consiste en agregar una coordenada más al punto [02:22-02:34], típicamente w = 1 [02:55-03:02]. Para regresar a cartesianas se divide entre w: x/w, y/w [02:47-02:53]. La propiedad clave es la invarianza a escala: si se multiplican todas las coordenadas por una misma constante se obtiene el mismo punto [03:21-03:27, 04:05-04:12], y para recuperar el original basta dividir por esa constante [03:48-04:04].
El modelo de cámara pinhole y sus suposiciones [04:20-06:45]
Hay muchos modelos de cámara; el más sencillo es el pinhole (estenopeico) [04:20-04:30]. La idea es una transformación que relaciona las coordenadas del mundo 3D con las coordenadas de la imagen 2D, combinando una matriz intrínseca, una matriz de rotación y una matriz de proyección [04:30-05:03]. Se asumen varias suposiciones iniciales [05:05-05:09]:
- Radio de aspecto (aspect ratio) = 1: la focal en dirección X es igual a la de dirección Y (píxeles cuadrados) [05:11-05:17, 06:22-06:24]. En televisión los formatos son 16:9 o 4:3, pero aquí se asume proporción 1 [05:19-05:27].
- El centro óptico está en la coordenada (0,0) [06:28-06:30].
- No hay desplazamientos ni rotaciones de la cámara; la cámara está en el origen [06:31-06:45].
Todo se convierte en una multiplicación de matrices [07:23-09:18]
La utilidad de las coordenadas homogéneas es que las traslaciones (izquierda, derecha, arriba, abajo), que con coordenadas cartesianas requieren una suma, pasan a ser una multiplicación [07:23-07:39, 08:36-08:46]. Por ejemplo, una relación en dirección Z que antes era suma se convierte en multiplicación [08:23-08:36]. Así, todo el cambio de modelo (mundo → cámara → imagen) se expresa como una matriz que multiplica las coordenadas, sin sumas [08:44-09:18]. [parte no entendida — el ejemplo concreto de la ecuación que escribía el profesor no se distingue en la grabación].
Parámetros intrínsecos y extrínsecos de la cámara [21:00-22:35]
Retomando el modelo de cámara: la relación entre la cámara y las coordenadas de la imagen se convierte en una multiplicación de matrices, y las coordenadas de la imagen (u, v) salen del vector con w = 1 [21:03-21:24]. Luego está la rotación: la cámara puede rotar en 3 ángulos (alfa, beta y gamma), y las rotaciones en los 3 ejes del mundo se combinan en una sola matriz de rotación 3×3 [21:27-22:05]. El problema completo considera parámetros intrínsecos (foco, cambio de escala, sesgo/skew, coordenadas del centro de la imagen) y parámetros extrínsecos (posición de la cámara en el mundo) [22:09-22:23]. En total: 5 intrínsecos [22:23-22:25] y 6 extrínsecos (3 rotaciones + 3 traslaciones: los grados de libertad de la cámara) [22:25-22:35].
Calibración de la cámara y correcciones por lente [23:36-24:42]
El objetivo es conocer los parámetros de la cámara, ya sea analíticamente o experimentalmente: se ponen muchos puntos conocidos en la pared (un patrón de calibración), se toma la imagen, se comparan las posiciones esperadas con las proyectadas y se ajusta la matriz [23:55-24:11]. Además, el modelo pinhole no considera lentes: si la cámara usa un angular o un teleobjetivo, hay que corregir las distorsiones [24:18-24:42].
Transformación proyectiva: el cuadrado que se vuelve trapecio [25:05-26:19]
Con dos vistas de una escena (un plano), no hay profundidad (no hay coordenada Z del mundo real) [25:07-25:21]. El ejemplo clásico: un satélite que toma una imagen lejana de la Tierra; un cuadrado en el suelo aparece como un trapecio — eso es una transformación proyectiva [25:55-26:06]. El ejercicio de la clase es trabajar solo en dos dimensiones, transformando un cuadrado en un trapecio [26:08-26:17].
Estimar la homografía a partir de puntos correspondientes [26:49-29:31]
El problema práctico: no se conocen analíticamente los valores de la matriz, pero se tienen puntos correspondientes en las dos imágenes [26:51-27:00]. El profesor pregunta cuántos puntos se necesitan [27:09-27:17]: para una transformación afín bastan 3 puntos; para una proyectiva (homografía) se necesitan 4 puntos [27:55-28:11, 41:06-41:12]. Con el mínimo de puntos la matriz se resuelve exacta, pero el resultado es muy sensible al error (un punto mal ubicado arruina todo) [29:07-29:11]. La forma robusta es tomar más de 6 puntos y buscar la matriz que minimice el error total [29:13-29:31].
Solución por mínimos cuadrados y SVD [29:58-40:24, 46:21-47:43]
Con más puntos que el mínimo, la matriz del sistema ya no es cuadrada y no se puede invertir [46:23-46:32, 40:00-40:02]. La solución es resolverlo como un problema de mínimos cuadrados: se buscan los valores (las X del sistema, con los B como datos de muestra) que minimizan el error cuadrático entre las coordenadas proyectadas y las observadas [46:48-47:13, 47:32-47:39]. Como no es fácil despejar la matriz, se usa la descomposición en valores singulares (SVD): la solución es el vector singular asociado al valor singular más pequeño [40:00-40:24, 47:14-47:28], y se puede demostrar que esa solución produce el mínimo error cuadrático [47:28-47:32].
Deformar la imagen (warping) e interpolación [43:23-45:48]
Una vez encontrada la matriz, se aplica a todas las coordenadas de una imagen para llevarla a la vista de la otra (overlay) y comparar [43:06-43:20]. Importante: se trabaja en 2D, con una transformación proyectiva de planos, por lo que no se considera la altura de los objetos: un objeto con altura proyectado con esa homografía no va a quedar bien [43:31-44:14]. Al deformar la imagen, los píxeles transformados pueden caer en coordenadas donde antes no existía un píxel, por lo que hay que remuestrear e interpolar: el usuario puede elegir el método (por ejemplo la interpolación cúbica u otra) [44:51-45:48]. [parte no entendida — el nombre exacto de los métodos de interpolación que mencionaba el profesor no se distingue en la grabación].
Aplicaciones: stitching y puntos característicos [40:30-43:20, 48:13-48:41]
La transformación proyectiva se usa en aplicaciones que hacen stitching (empalme) de imágenes: se encuentran puntos correspondientes en ambas, se calcula la matriz que mapea una en la otra y se sobreponen [42:11-43:20]. En esta etapa la selección de puntos es manual (hay una parte "selección de puntos" en el script de la práctica); la detección automática de puntos característicos es un tema posterior [41:50-42:09]. El profesor señala que esto ya es parte de la actividad de la clase y que luego se aplicará un poco más [48:13-48:35].
2 Puntos destacados / Lo que hay que saber
3 Actividades y tareas pendientes
*[parte no entendida — no queda clara en la grabación la fecha de entrega ni si hay más tareas con fecha]
4 Dudas que podrían examinar
¿Qué son las coordenadas homogéneas?
Son la representación de un punto agregándole una coordenada extra (w, normalmente 1); para volver a cartesianas se divide entre w [02:22-02:53].
¿Por qué las coordenadas homogéneas son invariantes a escala?
Porque multiplicar todas las coordenadas por una constante representa el mismo punto; basta dividir entre la constante para recuperarlo [04:05-04:12].
¿Qué ventaja dan las coordenadas homogéneas?
Convierten las operaciones (incluidas las traslaciones) en multiplicaciones de matrices, sin sumas [08:36-09:18].
¿Cuántos parámetros tiene el modelo de cámara?
5 intrínsecos (foco/escala, sesgo, centro de la imagen…) y 6 extrínsecos (3 rotaciones + 3 traslaciones) [22:09-22:35].
¿Qué es una transformación proyectiva?
La que mapea un plano de una vista a otra; por ejemplo, un cuadrado visto de lado se convierte en un trapecio [25:55-26:06].
¿Cuántos puntos se necesitan para una homografía?
4 puntos correspondientes para una proyectiva; 3 para una afín [27:55-28:11].
¿Por qué se toman más de 6 puntos si bastan 4?
Porque con el mínimo el sistema es muy sensible al error de ubicación de los puntos; con más puntos se minimiza el error total [29:07-29:31].
¿Cómo se resuelve la homografía cuando hay muchos puntos?
Por mínimos cuadrados: se usa SVD y la solución es el vector singular asociado al valor singular más pequeño [40:00-40:24, 47:14-47:32].
¿Por qué un objeto con altura queda mal con una homografía?
Porque la homografía modela la transformación de un plano; no considera las alturas [43:31-44:14].
¿Por qué se necesita interpolación al deformar la imagen?
Porque los píxeles transformados caen en coordenadas donde antes no existía un píxel; hay que remuestrear [44:51-45:48].
5 Sitios o recursos para visitar
El modelo de cámara más simple y su geometría. · es.wikipedia.org
Por qué se agrega una coordenada y su invarianza a escala. · es.wikipedia.org
Transformación proyectiva entre dos planos e imágenes. · es.wikipedia.org
Método usado para resolver la homografía por mínimos cuadrados. · es.wikipedia.org
Estimación de la homografía desde puntos correspondientes. · en.wikipedia.org
Aplicación de las transformaciones proyectivas para unir vistas. · es.wikipedia.org
Estimación de los parámetros intrínsecos y extrínsecos. · en.wikipedia.org
6 Glosario de términos
- Modelo de cámara pinhole (estenopeico): el modelo de cámara más simple; relaciona el mundo 3D con la imagen 2D por proporcionalidad.
- Coordenadas homogéneas: representación de un punto con una coordenada extra (w); invariantes a escala.
- Coordenadas cartesianas (reales): las coordenadas usuales (x, y); se recuperan dividiendo las homogéneas entre w.
- Matriz intrínseca: parámetros propios de la cámara (focales, centro óptico, sesgo).
- Matriz de rotación: orientación de la cámara en el mundo (3 ángulos), combinada en una matriz 3×3.
- Parámetros extrínsecos: posición y orientación de la cámara (3 rotaciones + 3 traslaciones = 6 grados de libertad).
- Calibración de cámara: estimar los parámetros de la cámara analítica o experimentalmente.
- Transformación proyectiva (homografía): mapeo entre dos planos/vistas; matriz 3×3 con 8 grados de libertad efectivos.
- Transformación afín: transformación lineal + traslación; requiere 3 puntos correspondientes.
- Mínimos cuadrados: criterio para hallar la matriz que minimiza el error total entre puntos proyectados y observados.
- SVD (descomposición en valores singulares): método para resolver la homografía; la solución es el vector singular del valor singular más pequeño.
- Warping (deformación): aplicar la homografía a todos los píxeles de una imagen para llevarla a otra vista.
- Interpolación / remuestreo: cálculo de valores de píxel en coordenadas donde no existía un píxel original.
- Stitching: empalme de varias imágenes de la misma escena usando transformaciones proyectivas.
- Puntos característicos (features): puntos distintivos de una imagen para correspondencias; su detección automática es un tema posterior.
7 Mapa mental textual
- Modelo de cámara, coordenadas homogéneas y homografía · Clase 8
- Modelo de cámara (pinhole)
- Proporcionalidad objeto–foco–imagen (triángulos semejantes)
- Suposiciones: aspect ratio 1, centro óptico en (0,0), sin rotación ni desplazamiento
- Parámetros: 5 intrínsecos + 6 extrínsecos (3 rotaciones + 3 traslaciones)
- Calibración y correcciones por lentes (angular, teleobjetivo)
- Coordenadas homogéneas
- Agregar coordenada w (w = 1)
- Volver: dividir entre w
- Invariantes a escala (multiplicar por constante = mismo punto)
- Todo se vuelve multiplicación de matrices (adiós a las sumas)
- Transformación proyectiva (homografía)
- Mapea planos entre dos vistas; el cuadrado se vuelve trapecio
- 4 puntos para proyectiva, 3 para afín
- Estimación: más de 6 puntos, mínimos cuadrados y SVD (vector singular menor)
- No modela alturas (solo escenas planas)
- Warping e interpolación
- Deformar toda la imagen con la matriz y sobreponer
- Remuestrear por interpolación donde no había píxel
- Aplicación
- Stitching de imágenes
- Selección manual de puntos (característicos automáticos: tema posterior)
- Modelo de cámara (pinhole)